Appearance
Playing repeated games with large language models
DisciplineInterdisciplinary
MethodSimulation
Tagsbehavioral game theorycooperationcoordinationlarge language modelsmethod · descriptive statisticsmethod · formal modelingmethod · simulationrepeated games
Summary
Problem: 大型语言模型(LLMs)越来越多地应用于与人类和其他智能体交互的场景,但它们在重复性社会互动中的行为模式尚不清楚,尤其是在需要合作与协调的情境下。 Approach: 作者采用行为博弈论的框架,让多种LLMs(如GPT-4、Claude 2等)在有限次重复的2x2博弈中相互对战、与简单策略对战以及与真实人类对战,系统分析其在各类博弈家族中的表现。 Finding: LLMs在纯粹自利性博弈(如囚徒困境家族)中表现优异,因为它们倾向于不原谅且自私;但在需要协调的博弈(如性别之战)中表现不佳,无法与交替策略等简单模式协调。通过“社会思维链”(SCoT)提示,可以改善GPT-4的协调行为,并在与人类对战时提高协调成功率和联合合作。 Significance: 该研究首次将行为博弈论系统应用于LLMs的社会行为评估,揭示了其行为特征(如不宽容、不协调),并为设计更具社会适应性的AI提供了可操作的干预方法(SCoT提示),对构建人机交互中的可信赖AI具有重要意义。
Theoretical Framework
- Theoretical tradition: 行为经济学与行为博弈论(Behavioral Game Theory),强调对理性、自利效用最大化假设的偏离,关注社会偏好和心理因素对决策的影响。
- Prior theories built upon: 经典博弈论(理性人假设)、行为博弈论(如社会偏好、有限理性)、人类在囚徒困境中的宽恕行为研究(如Fudenberg等人关于错误容忍的工作)、协调博弈中的惯例形成理论(如Schelling的聚焦点理论)。
- Causal mechanism: LLMs的行为由其训练数据和上下文学习能力塑造,导致其在自利博弈中表现出“不宽容”的均衡策略,而在协调博弈中因缺乏对他人行为的适应性推理而失败;SCoT提示通过强制模型先预测对手行为再决策,激活了类似心理理论(Theory of Mind)的推理路径,从而改善协调。
- Key assumptions: LLMs的文本生成可以映射为博弈中的策略选择;有限次重复博弈的设定能够揭示稳定的行为模式;LLMs的行为可以通过提示工程进行系统性调节;人类在博弈中的行为模式(如交替策略)可作为评估LLMs社会智能的基准。
- Theoretical move: 本文应用行为博弈论框架来描述和诊断LLMs的社会行为,并通过引入SCoT提示扩展了提示工程在改善AI社会推理方面的理论边界,将机器行为研究纳入行为博弈论的分析范畴。
- Scope conditions: 研究限于有限次重复的2x2博弈、完全信息条件、特定的LLMs版本(截至2025年);结果可能不适用于无限次博弈、不完全信息博弈或更大规模的多智能体交互;人类实验样本来自Prolific平台,可能影响生态效度。
Research Design
研究类型为模拟实验与在线人类实验相结合。模拟部分以LLMs和简单策略为分析单元,操纵博弈类型(囚徒困境、性别之战等)和对手类型;人类实验部分以人类参与者为分析单元,操纵LLM的提示条件(基础版 vs. SCoT版)。关键因变量包括:博弈得分(实际得分/理想最高分)、背叛率、协调成功率、联合合作率、人类对对手身份的猜测。自变量为LLM类型、博弈家族、提示条件。
Data & Sample
- 模拟部分:涉及GPT-4、text-davinci-002、text-davinci-003、Claude 2、Llama 2 70B等模型,以及三种简单策略(始终合作、始终背叛、首轮背叛后合作)和一种交替策略。共进行1,224场博弈(涵盖6个博弈家族),每场博弈进行10轮。
- 人类实验部分:N=195名参与者,通过Prolific平台招募。每名参与者分别与基础版GPT-4或SCoT版GPT-4进行囚徒困境和性别之战各一局(共两局),博弈顺序随机。实验后询问参与者认为对手是人类还是AI。
Analytical Strategy
- 模拟分析:计算各模型在不同博弈家族中的标准化得分(实际得分/理想最高分),使用t检验和贝叶斯因子比较模型间差异;通过热图展示背叛率、协调率等行为模式;进行稳健性检验(随机化选项顺序、重命名选项、改变效用单位、添加背景故事、延长博弈轮次等)。
- 人类实验分析:使用混合效应回归模型分析提示条件对参与者得分、协调成功率、联合合作率以及人类感知(认为对手是人类)的影响,报告回归系数、P值、置信区间和贝叶斯因子。
Results & Findings
- LLMs在自利博弈中表现优异:所有LLMs在囚徒困境家族中得分较高,其中GPT-4表现最佳。这是因为GPT-4在遭遇一次背叛后便永不合作,采取极度不宽容的自利策略,这在有限次重复博弈中恰好是均衡策略。
- LLMs在协调博弈中表现不佳:在性别之战中,GPT-4面对交替策略(模拟人类常见行为)时无法协调,始终选择自己偏好的选项,导致协调失败。稳健性检验表明这一缺陷并非由特定提示或支付矩阵引起。
- 预测能力与行动能力分离:GPT-4能够准确预测交替策略的下一步行动(从第5轮开始),但在自己作为玩家时却不按预测行动,表现出“知”与“行”的分离。
- SCoT提示改善协调行为:要求GPT-4在决策前先预测对手行动(社会思维链),使其从第5轮开始学会交替,成功与交替策略协调。
- 人类实验验证:与基础版GPT-4相比,SCoT版GPT-4在性别之战中显著提高了参与者的得分和协调成功率,在囚徒困境中略微提高了联合合作率,并让参与者更倾向于认为对手是人类。
- 零结果与意外发现:在囚徒困境中,SCoT提示未显著提高参与者得分;LLMs在赢-赢博弈中表现最佳(不意外),但在囚徒困境家族中的优异表现出乎意料,因为这对人类而言是困难的。
Limitations
- 研究仅关注有限次重复的2x2博弈,未探索无限次博弈或不完全信息情境。
- 人类实验样本来自Prolific平台,可能不代表所有人群,且实验设置(已知可能对手为AI)可能影响行为。
- 仅对GPT-4进行了深入的SCoT提示分析,其他模型的调节潜力未充分探索。
- 博弈轮次固定为10轮,可能不足以观察更长期的策略演化。
- 未深入分析LLMs行为背后的训练数据偏差或具体机制。
Key Contributions
- 首次将行为博弈论系统应用于LLMs的社会行为评估,建立了机器行为博弈论的研究范式。
- 揭示了LLMs在合作与协调博弈中的行为特征:在自利博弈中因不宽容而成功,在协调博弈中因缺乏适应性而失败。
- 发现LLMs存在“预测-行动”分离现象,即能理解对手模式但无法据此调整自身行为。
- 提出并验证了社会思维链(SCoT)提示方法,有效改善了LLMs的协调行为和人机交互质量。
- 通过人类实验证明了SCoT提示不仅能提升客观博弈表现,还能增强人类对AI社会性的感知。
Key Claims
"Our results show that LLMs perform particularly well at self-interested games such as the iterated Prisoner’s Dilemma family. However, they behave suboptimally in games that require coordination, such as the Battle of the Sexes." (Abstract) "GPT-4 never cooperates again when playing with an agent that defects once but then cooperates on every round thereafter. Thus, GPT-4 seems to be rather unforgiving in this set-up." (Results, Prisoner’s Dilemma section) "GPT-4 seemingly does not adjust its choices to the other player but instead keeps choosing its preferred option. GPT-4, therefore, fails to coordinate with a simple, human-like agent, an instance of a behavioural flaw." (Results, Battle of the Sexes section) "GPT-4 seemingly could predict the alternating patterns but instead just did not act in accordance with the resulting convention." (Results, Prediction scenarios section) "Applying this method improved GPT-4’s behaviour, and it started to alternate from round 5 onwards." (Results, SCoT prompting section)